Управление на европроекти управление на европроекти
Claude

Claude Opus 4.6: по-силен в програмирането, 1M контекст и нови инструменти за разработчици

Anthropic обнови най-силния си модел, като пусна Claude Opus 4.6 с фокус върху програмиране, по-дълги автономни задачи и работа с много голям контекст. Компанията добавя и нови възможности в Claude Code и Claude Developer Platform, както и подобрения в офис инструментите.

Opus 4.6 запазва цената си от $5/$25 на милион токена и е наличен в claude.ai, през API и в големите облачни платформи. За разработчици моделът е достъпен като claude-opus-4-6.

Какво ново в Claude Opus 4.6

Според Anthropic, Opus 4.6 надгражда Claude Opus 4.5 с по-силни способности за кодиране и по-устойчиво изпълнение на агентни задачи. Моделът планира по-внимателно, задържа фокус по-дълго, работи по-надеждно в по-големи кодови бази и подобрява code review и debugging, включително засичане на собствени грешки.

Ключова новост за Opus-клас е контекстен прозорец от 1 милион токена (beta). Това разширява сценариите, в които моделът може да обработва и проследява много информация без съществено „разпадане“ на контекста.

Opus 4.6 е първият Opus-клас модел на Anthropic с 1M token контекст (в beta), а изходът може да достига до 128k токена — полезно при генериране на по-големи артефакти като отчети, спецификации и код.

Резултати от тестове и сравнения

Anthropic позиционира Opus 4.6 като водещ модел в редица оценки. Сред примерите са най-висок резултат на Terminal-Bench 2.0 (agentic coding) и лидерство на Humanity’s Last Exam (мултидисциплинарен тест за комплексно разсъждение).

-25% ОТСТЪПКА ОТ ХОСТИНГ jump.bg намаление

В GDPval-AA (за икономически ценни задачи в области като финанси и право) Opus 4.6 изпреварва OpenAI GPT-5.2 с около 144 Elo точки и Claude Opus 4.5 с 190 точки. Моделът води и на BrowseComp, където се измерва способността за намиране на трудно откриваема информация онлайн.

При задачи с много голям контекст Anthropic акцентира върху подобрение спрямо т.нар. „context rot“. На MRCR v2 (8-needle, 1M вариант) Opus 4.6 достига 76%, докато Sonnet 4.5 е на 18.5%, което според компанията е качествена промяна в това колко ефективно може да се използва дълъг контекст.

Безопасност и мерки срещу злоупотреба

По данни от системните оценки, повишените способности не водят до влошаване на профила по безопасност. В автоматизиран поведенчески одит Opus 4.6 показва ниски нива на несъгласувано поведение като измама, подмазване, насърчаване на заблуди и съдействие при злоупотреба. Компанията твърди и че моделът има най-ниски нива на „over-refusal“ (откази при безобидни заявки) сред последните версии на Claude.

Anthropic съобщава, че е провела най-широкия си пакет от тестове за безопасност за този модел, включително нови оценки за благосъстоянието на потребителя, по-сложни тестове за отказ при потенциално опасни заявки и обновени проверки за опити моделът да извършва вредни действия незабелязано. Използвани са и методи от interpretability за по-добро разбиране на вътрешните механизми на поведение.

Поради по-силните способности в киберсигурността са добавени шест нови „cybersecurity probes“ за засичане на вредни отговори и проследяване на потенциални сценарии за злоупотреба. Паралелно моделът се използва и за защитни цели, включително откриване и закърпване на уязвимости в open-source софтуер; Anthropic посочва, че може да въведе интервенции в реално време за блокиране на злоупотреби.

Обновления в API и продуктите: агенти, компактиране и офис инструменти

Claude Developer Platform получава функции, насочени към по-дълги задачи и по-прецизен контрол над разход/скорост:

  • Adaptive thinking – вместо прост избор включено/изключено за extended thinking, моделът може сам да прецени кога е нужно по-дълбоко разсъждение; поведението зависи и от нивото на effort.
  • Effort – четири нива: low, medium, high (по подразбиране) и max, за баланс между „интелигентност“, латентност и цена.
  • Context compaction (beta) – автоматично обобщаване и замяна на по-стар контекст при приближаване до зададен праг, за да не се удря лимитът на прозореца при дълги разговори/агенти.
  • 1M token context (beta) – наличен в Claude Developer Platform; за заявки над 200k токена се прилага премиум ценообразуване $10/$37.50 за милион входни/изходни токени.
  • 128k output tokens – възможност за много по-дълги отговори в една заявка.
  • US-only inference – за натоварвания, които трябва да се изпълняват в САЩ, при 1.1× токен цена.

В Claude Code се добавя „agent teams“ (research preview) – стартиране на няколко агента, които работят паралелно и се координират автономно, подходящо за задачи, които се разделят на независими подзадачи, като прегледи на кодови бази. Потребителят може да поеме контрол над подагент чрез Shift+Up/Down или tmux.

Има и подобрения за офис работа: Claude в Excel е надграден за по-дълги и по-сложни сценарии, включително планиране преди действие, приемане на неструктурирани данни и извеждане на подходяща структура без изрични указания, както и изпълнение на многостъпкови промени „на един път“. Claude в PowerPoint излиза като research preview за плановете Max, Team и Enterprise, като поддържа съобразяване с оформления, шрифтове и slide masters за консистентност с бранда.

Какво означава това

  • По-практичен агентен програмен модел: подобреното планиране и работа в големи кодови бази може да намали нуждата от „подканване стъпка по стъпка“.
  • По-голям контекст с по-малко деградация: 1M токена (beta) и compaction са важни за анализ на големи комплекти документи, одити и корпоративни знания.
  • Повече контрол за разработчици: effort и adaptive thinking дават възможност да се оптимизира между цена, скорост и качество според конкретната задача.
  • Разширение към офис продуктивност: подобренията в Excel и preview в PowerPoint целят моделът да е по-полезен в типични бизнес процеси, не само в писане на код.

Back to top button